Type: entity
Confidence: 0.80
Created: 2026-04-20
Updated: 2026-04-20
Tags: AILLMAnthropic模型AI工程

Claude 3.5 Sonnet

概述

Claude 3.5 Sonnet 是 Anthropic 推出的 Claude 系列模型之一,在 SWE-bench Verified 上实现了当时 SOTA 成绩(49%),证明了单 Agent 架构配合优质工具集即可达到顶尖编码能力。

关键内容

  1. SWE-bench SOTA 成绩:在 SWE-bench Verified 上达到 49% 解决率,为当时最高成绩,后续迭代达到更高。这一成绩标志着 Claude 在编码 Agent 基准上取得领先地位。

  2. 单 Agent 架构设计:采用相对简单的单 Agent 架构——Claude 3.5 Sonnet 作为核心推理引擎,配合精心设计的工具集(文件读写、命令执行、搜索等),无复杂的多 Agent 编排。体现了 Anthropic "简单优于复杂"的哲学。

  3. 工具优化优先:在 SWE-bench 任务中,工程师花在工具优化上的时间多于花在整体 prompt 上的时间。关键发现包括要求工具始终使用绝对路径,解决了模型在相对路径上的系统性错误。

  4. Think 工具集成:集成了 Think 工具 专为代码调试场景定制,实验表明平均提升性能 1.6%(Welch t 检验,p < 0.001,效应量 d=1.47)。

  5. 产品意义SWE-bench 成绩直接支撑了 Claude Code 产品的核心价值主张——Claude 不仅是代码补全工具,而是能够独立解决真实软件工程问题的 Agent。

来源

相关